Агентные фреймворки и метод агентных дебатов для верификации выводов
Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department) и руководства Anthropic «Building Effective Agents». Для использования на семинаре СФИ — блок «Агентные системы как инструмент научной верификации».
1. Ключевой посыл
Курс CMU 17-630 завершается интеграцией всех техник в агентные системы (Week 9–10):
«Week 9: Agents I — introduces AI agents as systems that combine reasoning with the ability to act, including available agent frameworks and concepts of tool use, planning, and reflection»
«Week 10: Agents II — continues studying AI agents with concepts of orchestration, multi-agent systems, and guardrails for safety»
Anthropic в своём руководстве «Building Effective Agents» (2024) подчёркивает:
«The most common chaining pattern is self-correction: generate a draft → have Claude review it against criteria → have Claude refine»
Почему это важно для исследователя: одна модель — одна точка зрения. Несколько «агентов» (даже имитированных в одном чате) — это встроенная система перекрёстной проверки, аналог рецензирования в научном мире.
2. Персоны (Personas): роли для модели
2.1. Что такое persona prompting
Persona prompting — назначение модели конкретной роли через системный промпт:
Ты — историк-архивист, специалист по документам
Поместного Собора 1917–1918 гг.
2.2. Что говорит наука (спойлер: всё сложнее, чем кажется)
Ряд крупных исследований 2024–2026 дали противоречивые результаты:
| Исследование | Вывод |
|---|---|
| Principled Personas (EMNLP 2025) | Экспертные персоны дают положительный или нейтральный эффект, но модели чувствительны к нерелевантным деталям (падение до 30 п.п.) |
| «Playing Pretend» (Wharton, 2025) | На сложных бенчмарках (GPQA) ни одна экспертная персона не улучшила точность. Google, Anthropic и OpenAI рекомендуют персоны, но эмпирика не подтверждает |
| «Helpful Assistant» ≠ Helpful (EMNLP Findings 2024) | 162 персоны × 26 категорий: добавление персоны не улучшает и может ухудшить результат на объективных задачах |
| Jekyll & Hyde (IJCNLP Findings 2025) | Ансамбль персоны + нейтрального промпта → +9.98% на GPT-4. Ключ: комбинация, а не одна персона |
| PRISM (2026) | Персоны помогают в alignment-задачах (безопасность, стиль), но вредят задачам извлечения знаний |
2.3. Когда персоны действительно помогают
| Ситуация | Эффект персоны | Рекомендация |
|---|---|---|
| Фактический вопрос («Когда было X?») | ❌ Нет улучшения или ухудшение | Не использовать персону |
| Стиль/формат ответа | ✅ Улучшение | «Ты — редактор научного журнала» |
| Критический анализ | ✅ Улучшение | «Ты — строгий рецензент» |
| Множественные перспективы | ✅ Улучшение через ансамбль | Jekyll & Hyde / MPT |
| Снижение предвзятости | ✅ Multi-Persona Thinking | Несколько контрастных персон одновременно |
2.4. Multi-Persona Thinking (MPT) — снижение bias
Multi-Persona Thinking (ACL Findings 2026)
Вместо одной персоны назначаются несколько контрастных — например, «консерватор» и «реформатор» — и модель проводит внутренний дебат между ними:
Рассмотри вопрос с трёх позиций:
Позиция A (историк-обновленец): [аргументы]
Позиция B (историк-традиционалист): [аргументы]
Позиция C (нейтральный наблюдатель): [синтез]
Теперь оцени: где эти позиции сходятся?
Где расходятся? Какие факты подтверждают каждую?
Результат: MPT снижает bias и при этом сохраняет качество рассуждений.
3. Memory Models: как агент помнит контекст
3.1. Проблема
Контекстное окно модели ограничено. В длинном исследовательском диалоге:
- Ранние факты «выпадают» из контекста
- Модель начинает противоречить сама себе
- Нет способа сослаться на «мы установили ранее»
3.2. Таксономия памяти (обзор 2026)
«Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers» (2026). arXiv:2603.07670
Память агента формализуется как цикл write → manage → read:
| Тип памяти | Аналогия | Реализация | Пример |
|---|---|---|---|
| Контекстная (short-term) | Рабочая память | Текущее окно диалога | Промпт + последние сообщения |
| Эпизодическая (episodic) | Личные воспоминания | Логи прошлых сессий | «Вчера мы обсуждали X» |
| Семантическая (semantic) | Энциклопедия | Векторные БД, Knowledge Graph | Загруженные PDF, NotebookLM |
| Процедурная (procedural) | Навыки | Сохранённые промпты, шаблоны | «Всегда проверяй цитаты по алгоритму Y» |
3.3. Практические системы
| Система | Архитектура | Для исследователя |
|---|---|---|
| MemGPT | Многоуровневая: main memory + recall DB + archive | Автоматический swap между уровнями |
| NotebookLM | Семантическая память на загруженных источниках | Привязка к вашим PDF/документам |
| Claude Projects | Контекстная память (до 200K токенов) + файлы | Загрузка корпуса текстов |
| Custom Instructions | Процедурная память (постоянные инструкции) | «Всегда цитируй источники» |
3.4. Иерархическая память (передовой край, 2026)
Серия работ ACL 2026 (HyperMem, GAM, TiMem, APEX-MEM) предлагает иерархическое хранение:
Уровень 3: Темы (Topic nodes)
↕
Уровень 2: Эпизоды (Episode nodes)
↕
Уровень 1: Факты (Fact nodes)
APEX-MEM (ACL 2026): property graph + temporal grounding → 88.88% на LoCoMo QA, превосходя все предыдущие системы.
Практический вывод: будущие ИИ-ассистенты будут помнить все ваши прошлые сессии, с отслеживанием изменений и противоречий. Пока этого нет — ведите лог важных решений вручную.
4. Агентные дебаты: «Общество разумов»
4.1. Основополагающая работа
Du, Y. et al. (2024). «Improving Factuality and Reasoning in Language Models through Multiagent Debate». ICML 2024.
Вдохновение: концепция Марвина Минского «The Society of Mind» — интеллект = взаимодействие множества «агентов-специалистов».
Алгоритм:
Вопрос
/ | \
Агент 1 Агент 2 Агент 3
(ответ) (ответ) (ответ)
\ | /
───── Раунд дебатов 1 ─────
Каждый читает ответы других.
Каждый критикует и уточняет свой.
/ | \
Агент 1' Агент 2' Агент 3'
(уточн.) (уточн.) (уточн.)
\ | /
───── Раунд дебатов 2 ─────
...
Финальный консенсус
Результаты (MIT CSAIL):
- Значительное улучшение фактической точности по сравнению с единичной генерацией
- Снижение галлюцинаций: агенты «стыдятся» выдумывать факты, когда другие агенты их проверяют
- Работает с любыми black-box моделями, без модификации
4.2. Почему дебаты лучше рефлексии
Важная находка Du et al.: self-reflection (модель проверяет сама себя) работает хуже, чем дебаты между несколькими агентами.
| Метод | Фактуальность | Почему |
|---|---|---|
| Один агент | Базовая | Одна точка зрения |
| Self-reflection | Слабое улучшение | Модель повторяет свои ошибки |
| Multiagent debate | Лучший результат | Взаимная критика выявляет ошибки, невидимые изнутри |
Аналогия из науки: рецензирование одним автором ≠ peer review.
4.3. Развитие: верификация фактов через дебаты (2025–2026)
| Система | Инновация | Результат |
|---|---|---|
| Tool-MAD (2026) | Каждый агент имеет свой инструмент (поиск, RAG) | +5.5% accuracy над baseline |
| DebateCV (2026) | Adversarial дебаты для проверки утверждений | 83.4% (golden evidence), превосходит все baseline на 2.6–5.8% |
| MAD-Fact (2025) | Clerk + Jury + Judge — трёхуровневая верификация | Превосходит SAFE и FIRE по precision и recall |
| GAVEL (ACL 2026) | Evidence Contract — каждый аргумент привязан к цитате | +4.2% FEVEROUS score, механическая проверка цитат |
| MAFC (Nature Sci. Reports, 2026) | Множество источников + credibility scoring | Лучший результат в multi-label fact-checking |
4.4. Архитектурные паттерны (Anthropic, 2024)
Anthropic систематизировал паттерны агентных систем:
| Паттерн | Как работает | Когда использовать |
|---|---|---|
| Prompt Chaining | A → B → C (линейная цепочка) | Задача разбивается на предсказуемые шаги |
| Parallelization | A ↕ B ↕ C → синтез | Независимые подзадачи, объединяемые в конце |
| Orchestrator-Workers | Оркестратор → динамические воркеры | Непредсказуемое количество подзадач |
| Evaluator-Optimizer | Генератор ↔ Критик (цикл) | Итеративное улучшение с чёткими критериями |
Для верификации исследований наиболее релевантен паттерн Evaluator-Optimizer (Generate → Critique → Refine).
5. Практическая реализация для исследователя
5.1. Уровень 1 — «Ручные дебаты» (без программирования)
Шаг 1 — Генерация: Задать вопрос в Чате A
Шаг 2 — Критика: Открыть Чат B с другой персоной:
Ты — строгий рецензент, скептик. Вот анализ коллеги:
[вставить ответ из Чата A]
Найди все слабые места:
1. Какие факты не подтверждены источниками?
2. Какие выводы не следуют из посылок?
3. Что упущено?
Шаг 3 — Синтез: Открыть Чат C:
Вот два мнения:
Аналитик: [Чат A]
Рецензент: [Чат B]
Синтезируй: что из анализа выдержало критику,
а что нужно пересмотреть?
5.2. Уровень 2 — «Встроенные дебаты» (один чат)
Проведи внутренний дебат по вопросу: [ваш вопрос]
Участник 1 — Защитник гипотезы:
Приведи 3 сильнейших аргумента ЗА.
Участник 2 — Оппонент:
Приведи 3 сильнейших аргумента ПРОТИВ.
Судья:
Оцени силу каждого аргумента.
Какая сторона убедительнее и почему?
Какие факты нуждаются в проверке?
5.3. Уровень 3 — «Тройная верификация» (золотой стандарт)
На основе паттерна GAVEL:
[Промпт 1 — Аналитик]:
Проанализируй документ X. Для каждого вывода укажи
точную цитату из источника.
[Промпт 2 — Верификатор]:
Проверь каждую цитату аналитика:
- Существует ли она в тексте?
- Точна ли она (дословно)?
- Поддерживает ли она сделанный вывод?
[Промпт 3 — Арбитр]:
Вот анализ и его верификация.
Какие выводы подтверждены?
Какие отклоняются?
Сформулируй итоговое заключение с уровнями уверенности.
6. Пример для богословского исследования
Задача: Верификация тезиса об экклезиологии Собора
«Ручные дебаты» в 3 чата:
Чат A (Аналитик):
Какую экклезиологическую модель (соборность vs
первенство) отражают «Определения» Поместного
Собора 1917–1918 гг.?
Приведи дословные цитаты из текстов определений.
Чат B (Оппонент):
Вот анализ коллеги о «Определениях» Собора:
[вставить ответ Чата A]
Ты — историк, критически настроенный к данной
интерпретации. Найди:
1. Цитаты, которые ПРОТИВОРЕЧАТ выводу
2. Альтернативные интерпретации тех же текстов
3. Контекст, который коллега мог упустить
Чат C (Синтез):
Перед тобой два анализа одного и того же вопроса:
[Аналитик]: ...
[Оппонент]: ...
Составь таблицу:
| Тезис | Подтверждение | Опровержение | Вердикт |
Для каждого тезиса — укажи уровень уверенности.
7. Что показать на семинаре
Демонстрация 1: «Три чата — один вопрос» (5 мин)
- Открыть 3 вкладки ChatGPT/Claude
- В первой — задать исследовательский вопрос
- Во второй — вставить ответ первой с ролью «рецензент»
- В третьей — показать синтез
Вывод для аудитории: «Это и есть multiagent debate — метод, опубликованный MIT на ICML 2024. Вы имитируете его вручную в 3 вкладках. Учёные показали, что дебаты лучше, чем самопроверка: модель не может найти свои ошибки, но другая модель — может».
Демонстрация 2: «Встроенный дебат» (3 мин)
- Задать промпт «Проведи внутренний дебат...» (шаблон из §5.2)
- Показать: модель генерирует аргументы за и против
- Обратить внимание: какие факты судья отмечает как «нуждающиеся в проверке» — это и есть потенциальные галлюцинации
Ключевые тезисы для слайда
- 🤖 Один агент = одна точка зрения: self-reflection не ловит собственные ошибки (Du et al., ICML 2024)
- 🗣️ Дебаты > монолога: взаимная критика агентов снижает галлюцинации и повышает фактуальность
- 👤 Персоны — палка о двух концах: помогают в критическом анализе, но не улучшают фактическую точность (Wharton 2025, EMNLP 2025)
- 🧠 Multi-Persona Thinking: несколько контрастных позиций в одном промпте снижают bias (ACL 2026)
- 📋 GAVEL-паттерн: каждый аргумент привязан к цитате + механическая проверка (ACL 2026)
- 🔄 Generate → Critique → Refine: главный паттерн Anthropic для надёжных ответов
8. Чек-лист: «Агентная верификация за 5 минут»
| # | Действие | Время | Что даёт |
|---|---|---|---|
| 1 | Получите ответ в Чате A | 1 мин | Первичный анализ |
| 2 | Вставьте ответ в Чат B с ролью «рецензент-скептик» | 1 мин | Внешняя критика |
| 3 | Проверьте: совпадают ли факты в обоих ответах? | 1 мин | Перекрёстная валидация |
| 4 | Попросите Чат C синтезировать и указать уровни уверенности | 1 мин | Арбитраж |
| 5 | Проверьте одну ключевую цитату вручную по источнику | 1 мин | Spot-check |
9. Связь с другими темами семинара
| Тема семинара | Связь с агентными фреймворками |
|---|---|
| [[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).]] | Агенты = автоматизированная декомпозиция; оркестратор разбивает задачу, воркеры выполняют подзадачи |
| [[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] | Дебаты = антидот к сикофантии. Агент-оппонент не «льстит», а критикует. Multi-Persona Thinking снижает bias |
| [[Оценка эффективности промптов через метрики самосогласованности (self-consistency) и калибровки ответов.]] | Дебаты = «самосогласованность 2.0»: вместо majority vote по ответам — structured critique с обоснованием |
| Парадигма 3 (Среда / NotebookLM) | NotebookLM = память (semantic store) + grounding. Агент с памятью + источниками = полная система |
| Методология «Святая Память» | Принцип цитируемости реализуется в GAVEL-паттерне: Evidence Contract привязывает каждый вывод к конкретному источнику |
Источники
- Du, Y. et al. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024. arXiv:2305.14325
- Anthropic (2024). Building Effective Agents. anthropic.com/research/building-effective-agents
- Anthropic (2025). How we built our multi-agent research system. anthropic.com/engineering/multi-agent-research-system
- «Principled Personas» (EMNLP 2025). — 9 LLMs × 27 tasks: персоны чувствительны к нерелевантным деталям
- «Playing Pretend: Expert Personas Don't Improve Factual Accuracy» (Wharton, 2025). — экспертные персоны не улучшают точность
- «When "A Helpful Assistant" Is Not Really Helpful» (EMNLP Findings 2024). — 162 персоны: нет улучшения на объективных задачах
- Jekyll & Hyde (IJCNLP Findings 2025). — ансамбль персоны + нейтрального промпта: +9.98% на GPT-4
- Multi-Persona Thinking (MPT) (ACL Findings 2026). — контрастные персоны снижают bias
- PRISM (2026). — персоны помогают в alignment, вредят в knowledge retrieval
- Tool-MAD (2026). — агенты с разными инструментами: +5.5% accuracy. arXiv:2601.04742
- DebateCV (2026). — adversarial дебаты: 83.4% на fact verification
- GAVEL (ACL Findings 2026). — Evidence Contract + механическая проверка цитат
- MAFC (Nature Scientific Reports, 2026). — multi-agent fact-checking с credibility scoring
- «Memory for Autonomous LLM Agents» (2026). arXiv:2603.07670 — обзор архитектур памяти
- APEX-MEM (ACL 2026). — property graph: 88.88% на LoCoMo QA
- CMU 17-630 Schedule — Weeks 9–10: Agents I & II